{"as_of":"2026-08-22T03:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8243c251317cd2ab05ed0e82827f4823acc6067bda6b757a029daa1d7e2b3376","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:08:51.495834Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:05:19.272138Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T05:54:33.575217Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-08-07T13:20:29.226330Z","title":"What’s in the Image? A Deep-Dive into the Vision of Vision Language Models.arXiv preprint arXiv:2411.17491, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22200","last_updated":"2025-05-28T10:25:43Z","snapshot_observed_at":"2026-08-16T19:59:37.800601Z","submitted_at":"2025-05-28T10:25:43Z","title":"Investigating Mechanisms for In-Context Vision Language Binding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:29.226330Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2505.22200"},"observation_digest":"sha256:0e5da7ccbab9058313b525b94cd96c15526110f1de972d73df47138448e50334","observation_id":"b7d78133-b0b0-44da-9a83-3dc8da27fa44","resolution":{"observed_at":"2026-08-07T13:20:29.226330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-08-06T18:39:01.636238Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08064","last_updated":"2026-06-06T18:51:46Z","snapshot_observed_at":"2026-08-16T10:13:30.458348Z","submitted_at":"2025-07-10T16:47:25Z","title":"PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:01.636238Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2507.08064"},"observation_digest":"sha256:b1fa8e62744102fd500db379e9c7ca1dc8aff15a441c9bb732fbe928c5b99110","observation_id":"fd8974b9-4d49-436a-8611-a22b476e4d89","resolution":{"observed_at":"2026-08-06T18:39:01.636238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-08-06T15:19:23.993702Z","title":"What’s in the im- age? a deep-dive into the vision of vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16240","last_updated":"2025-07-22T05:25:38Z","snapshot_observed_at":"2026-08-22T00:12:26.322242Z","submitted_at":"2025-07-22T05:25:38Z","title":"Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:23.993702Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2507.16240"},"observation_digest":"sha256:19e271eb9d800302a2a711cebf09a6094467cd5ef85e8b1cd57e717263d9378b","observation_id":"42272f09-424f-4567-976e-8fde399d364d","resolution":{"observed_at":"2026-08-06T15:19:23.993702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":"2411.17491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-07-08T05:54:33.575217Z","title":"What’s in the image? what survives in modern multimodal lms","venue":"cs.CV","work_id":"95c73d5c-ff49-4baa-a8c8-eaf7218b0276","year":2024},"citing_paper":{"arxiv_id":"2604.10039","last_updated":"2026-04-11T05:23:19Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T05:23:19Z","title":"Counting to Four is still a Chore for VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:06.327888Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2604.10039"},"observation_digest":"sha256:b34fe5311b8783425d5c2875f5a2e0b8fbb41353a6ca86b8d3a475feaeceb300","observation_id":"fdb07771-8a63-4754-bea1-7ffeaf987dc0","resolution":{"observed_at":"2026-05-11T10:06:03.297518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":"2411.17491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-07-08T05:54:33.575217Z","title":"What’s in the image? what survives in modern multimodal lms","venue":"cs.CV","work_id":"95c73d5c-ff49-4baa-a8c8-eaf7218b0276","year":2024},"citing_paper":{"arxiv_id":"2606.28273","last_updated":"2026-06-26T17:16:04Z","snapshot_observed_at":"2026-08-13T08:42:11.682804Z","submitted_at":"2026-06-26T17:16:04Z","title":"Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T03:53:04.984303Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2606.28273"},"observation_digest":"sha256:6c867c38213de172befbf4e16d7aad3cdddcfff34b33f84fda201c86fee60daf","observation_id":"c3bcf70c-4763-4c29-890f-db5f2eb90ecc","resolution":{"observed_at":"2026-07-01T17:15:52.050405Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":"2411.17491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-07-08T05:54:33.575217Z","title":"What’s in the image? what survives in modern multimodal lms","venue":"cs.CV","work_id":"95c73d5c-ff49-4baa-a8c8-eaf7218b0276","year":2024},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:1f33658a19922f875d4ddff44777337164bf70672373bbd599b925564d6e74cf","observation_id":"f099b476-2c82-4664-bae0-8de9a7610a42","resolution":{"observed_at":"2026-07-08T05:54:33.577235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-08-15T15:05:19.272138Z","title":"arXiv 2024 arXiv:2411.17491","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02830","last_updated":"2026-08-03T19:44:45Z","snapshot_observed_at":"2026-08-17T05:48:45.461740Z","submitted_at":"2026-08-03T19:44:45Z","title":"In-Context Collapse in Vision-Language Models and How to Mitigate it?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:19.272138Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2608.02830"},"observation_digest":"sha256:5b49dea0d802dfb7578ef55a960ce0b2f64d67186b973819860994704f581cdb","observation_id":"f90f76b3-eed1-4a3b-a13a-947ff61d0e32","resolution":{"observed_at":"2026-08-15T15:05:19.272138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17491","snapshot_observed_at":"2026-08-07T13:35:52.051427Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06171","last_updated":"2026-08-06T15:37:04Z","snapshot_observed_at":"2026-08-18T02:42:49.419014Z","submitted_at":"2026-08-06T15:37:04Z","title":"Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:52.051427Z"},"links":{"cited_paper":"/paper/2411.17491","citing_paper":"/paper/2608.06171"},"observation_digest":"sha256:2f39c9ccc2a72f433fccf2b3d556a25715f899a4e83d1bab814d440b546f3903","observation_id":"72836731-785e-4f17-8230-0bacb9b81695","resolution":{"observed_at":"2026-08-07T13:35:52.051427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17491/citation-record","integrity":"/paper/2411.17491/integrity","json":"/paper/2411.17491/citation-record.json","paper":"/paper/2411.17491"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T12:08:51.353986Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.353986Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:e6654372a0bce5ee9037b227221e80af7d551f44c2f0542c3e32de7600446619","observation_id":"de162673-5c57-4daa-9aa8-86f1473d7bd1","resolution":{"observed_at":"2026-08-12T12:08:51.353986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.356686Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.356686Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:91f3adf6b1e64634e1cc72b43ac1167b68247a9bea6069e54011ea1d4835ec61","observation_id":"b5b22506-24a0-4e0f-a8ac-5e58e5b63171","resolution":{"observed_at":"2026-08-12T12:08:51.356686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-12T12:08:51.359108Z","title":"Hallucination of multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.359108Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:5677b2fced74d0745fa8d6471366261c6caab9ae57ca6a262b46cc5fca20e9be","observation_id":"087802d2-6fab-4b70-b3da-6d7ddc6b265f","resolution":{"observed_at":"2026-08-12T12:08:51.359108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04236","last_updated":"2024-06-06T16:35:36Z","snapshot_observed_at":"2026-08-20T02:38:10.118500Z","submitted_at":"2024-06-06T16:35:36Z","title":"Understanding Information Storage and Transfer in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04236","snapshot_observed_at":"2026-08-12T12:08:51.362019Z","title":"Under- standing information storage and transfer in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.362019Z"},"links":{"cited_paper":"/paper/2406.04236","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:08223ae10f2976df9d96f870ef0597472ad21e3641242419cfc143b6d219d251","observation_id":"c5281822-b368-42a7-a429-9a55a42a0703","resolution":{"observed_at":"2026-08-12T12:08:51.362019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.365427Z","title":"Generic attention- model explainability for interpreting bi-modal and encoder- decoder transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.365427Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:f6a45cfce08125eea5c891647c604413fa7689639eed41049c33f39dbb941068","observation_id":"beb9b1f7-2603-43fe-9f23-28c01888eb24","resolution":{"observed_at":"2026-08-12T12:08:51.365427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T12:08:51.368155Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.368155Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:3c38a93ac09acd1e2212e7fe59562d19fb9361f66522ded6cf68690ca01138df","observation_id":"892eb2f5-f6e5-4c20-85a2-2f1fd3b6fbf7","resolution":{"observed_at":"2026-08-12T12:08:51.368155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.828406Z","title":"InternVL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"a46e04ec-4dfb-460b-8e1a-ae16a93500c2","year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.371693Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:42b4446791919ffce3a2c1832a6c538a5ba54e7366aff694a3cb227228e16036","observation_id":"2c5e41ca-7797-44e9-9092-f701b65660a5","resolution":{"observed_at":"2026-08-12T12:08:51.830944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-08-16T14:00:03.452025Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-12T12:08:51.374510Z","title":"What does bert look at? an analysis of bert’s attention","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.374510Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:8d01225cac2cf43b37ae30ce1a05184def908d64ece72dd191b8e475ed9cc2de","observation_id":"af800eb7-bc7a-49ae-ad87-0c72d78b3f4c","resolution":{"observed_at":"2026-08-12T12:08:51.374510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.378183Z","title":"Towards automated circuit discovery for mechanistic interpretability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.378183Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:d5e32d5a08553de644e9f1ef9a26f01d3428244151e5325cc1cb4d48f81cc1ce","observation_id":"1c8bde47-d19b-45bd-9b00-ac98c8ef9461","resolution":{"observed_at":"2026-08-12T12:08:51.378183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T12:08:51.380730Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.380730Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:b6025dddce892f5045bf8a59e4ff5cc916437c5adb954b5832f98bcb53b2c224","observation_id":"d6ffd854-c6f7-4f43-8c74-f458c8a0410a","resolution":{"observed_at":"2026-08-12T12:08:51.380730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T12:08:51.384183Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.384183Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:d8af0a93cf2dd6b936cf5effa2afaac0fe138810fd091ff157f353f7a838cd92","observation_id":"11c432f5-df61-4d2d-8652-c4014c85c10b","resolution":{"observed_at":"2026-08-12T12:08:51.384183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-13T01:11:33.500647Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-12T12:08:51.387157Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.387157Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:b87952f96b83a724685d303951faf559f86d43b4598abf83140da5dbf7fad058","observation_id":"762f1bae-143f-4988-b852-fe6dfba05150","resolution":{"observed_at":"2026-08-12T12:08:51.387157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14767","last_updated":"2023-10-13T19:01:20Z","snapshot_observed_at":"2026-08-16T15:37:00.428813Z","submitted_at":"2023-04-28T11:26:17Z","title":"Dissecting Recall of Factual Associations in Auto-Regressive Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14767","snapshot_observed_at":"2026-08-12T12:08:51.389838Z","title":"Dissecting recall of factual associations in auto-regressive language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.389838Z"},"links":{"cited_paper":"/paper/2304.14767","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:3c8753df00e7c7baab79616ee919c67e099161174788bb4650d0ddedebb0aaa1","observation_id":"69994d22-d342-4955-87e9-fc3bb30f59b0","resolution":{"observed_at":"2026-08-12T12:08:51.389838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.817175Z","title":"Chat- gpt outperforms crowd workers for text-annotation tasks","venue":null,"work_id":"3b61b8a1-349f-461e-9497-918e3ec98c79","year":2023},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.392418Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:832e59b9b06a209619448bdb9c056855d0f3b0e36e7ae76e4a94924193d3a271","observation_id":"e7439443-0c2a-4d36-8655-d036e87cd50b","resolution":{"observed_at":"2026-08-12T12:08:51.819882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-16T14:06:10.494270Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-12T12:08:51.394433Z","title":"The unreason- able ineffectiveness of the deeper layers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.394433Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:d8e75605913a0c37c870d434a9bdc6e85132bad9bb182bc803da48f777c009b0","observation_id":"a6fe1baa-c504-4b3e-b6e3-a84e9024d6cb","resolution":{"observed_at":"2026-08-12T12:08:51.394433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.396597Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for per- ception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.396597Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:6562e958821cb78dcfc559beb3c9455051ae678506b9aad31a47f7f55a3e3dfd","observation_id":"36b2e311-9696-4ac9-b50c-540d6696c5be","resolution":{"observed_at":"2026-08-12T12:08:51.396597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.806422Z","title":"Is chatgpt better than human annotators? potential and limitations of chatgpt in explaining implicit hate speech","venue":null,"work_id":"4dd31c20-f52c-4521-b779-4b86c12eadd0","year":2023},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.398506Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:52c7a0f97eba5e75b344a3a60a6d8fa4a70baa46ccfb93f7b7a926c6a0dba8dd","observation_id":"5ee653b1-5446-478e-86a5-0f086855a170","resolution":{"observed_at":"2026-08-12T12:08:51.808786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T12:08:51.400392Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.400392Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:5d6195a48b9ec83c7e6a4461af6c75098b721d08f3352c5b532d63fb1d090588","observation_id":"3d0eefc8-f3f7-4c04-9799-4d0f9b678951","resolution":{"observed_at":"2026-08-12T12:08:51.400392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02762","last_updated":"2025-02-10T20:13:31Z","snapshot_observed_at":"2026-08-16T13:12:51.132719Z","submitted_at":"2024-10-03T17:59:57Z","title":"Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02762","snapshot_observed_at":"2026-08-12T12:08:51.404123Z","title":"Interpreting and editing vision-language rep- resentations to mitigate hallucinations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.404123Z"},"links":{"cited_paper":"/paper/2410.02762","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:0cd4dce812a4658499d6e3e7b771f10b383280f9ed64be5a4226d20f457a6d01","observation_id":"23d4f89a-e093-4483-952c-f7d56133c2f8","resolution":{"observed_at":"2026-08-12T12:08:51.404123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.798708Z","title":"Segment any- thing","venue":null,"work_id":"a89a9c54-b1a4-4b3d-b3e4-7a47a8bf0a1b","year":2023},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.407023Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:8c1ab993bfc6237cf20ce69b652158b256d7d033274893912d8a04e00973fac3","observation_id":"f30c3830-d93c-40f3-9e8d-a8f0597fa5d2","resolution":{"observed_at":"2026-08-12T12:08:51.801838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.409875Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.409875Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:5b6a42bc96e44c238369eca011a775e545313971c20f85ff58f6a084cdf47fdf","observation_id":"0d8990f3-234b-4afc-95c1-294ea1ca8b52","resolution":{"observed_at":"2026-08-12T12:08:51.409875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17444","last_updated":"2024-05-04T19:28:10Z","snapshot_observed_at":"2026-08-19T08:52:20.968876Z","submitted_at":"2023-09-29T17:54:46Z","title":"LLM-grounded Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17444","snapshot_observed_at":"2026-08-12T12:08:51.412603Z","title":"Llm-grounded video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.412603Z"},"links":{"cited_paper":"/paper/2309.17444","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:6f9dd1ff95795212433b0900e729b55225df7ef5810879ce712d28af78d8c056","observation_id":"1b0f2264-ffa6-4b98-8eba-dfb359cab21d","resolution":{"observed_at":"2026-08-12T12:08:51.412603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.788174Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"5d0ceafa-6036-4902-9c1e-e4f3f6d31795","year":2014},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.415312Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:9e9d4bdf0734e55c9346773c7b511ed4de9aef27b7de6eeea4da5732980ffba6","observation_id":"4d141e33-a30a-4f55-a70a-1c097ee82b25","resolution":{"observed_at":"2026-08-12T12:08:51.790775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.780738Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"bed9253d-becb-4154-bb9b-1b3de90f8e37","year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.417742Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:0b7e91d9d6fcbff1bde19afb137a3b29eb7024b40fd30275f462444788d5ea7f","observation_id":"9accea1c-b706-46d7-8a4e-b15e7e7dcba2","resolution":{"observed_at":"2026-08-12T12:08:51.783319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.420681Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.420681Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:ec26613ebd4074b57f10e3d0cf859721d5948057dc62e8eb213f1085a4df5a75","observation_id":"fe2364bd-9b3a-4fa7-a5c8-5f8c273d67e4","resolution":{"observed_at":"2026-08-12T12:08:51.420681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.422975Z","title":"Clip-driven universal model for organ segmentation and tumor detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.422975Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:df336a21fdc9f08c24836aad77c510dc81d2280104c0b791b5d060780eff69e1","observation_id":"134b4812-cce6-421a-be8a-8f15f0430de6","resolution":{"observed_at":"2026-08-12T12:08:51.422975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12202","last_updated":"2024-02-29T17:20:08Z","snapshot_observed_at":"2026-08-18T16:28:31.949068Z","submitted_at":"2024-01-22T18:42:20Z","title":"OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12202","snapshot_observed_at":"2026-08-12T12:08:51.426120Z","title":"Ok-robot: What really matters in integrating open-knowledge models for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.426120Z"},"links":{"cited_paper":"/paper/2401.12202","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:6999673ecbe276cab56489678a874ce9967e3322a627d55a5f05ea368a3c746a","observation_id":"bd0fc225-4d62-4fd3-a26b-b4589b72f26b","resolution":{"observed_at":"2026-08-12T12:08:51.426120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.765596Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":"8fd3cf5b-60e3-4884-b3d7-a5d9b810e8cb","year":2022},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.429625Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:84d4c803bc9f9958e2718ef3ff957c16f5a2786c477e1761704b3357def988dd","observation_id":"d1d4dd65-50d5-4040-a114-327c57766e75","resolution":{"observed_at":"2026-08-12T12:08:51.768597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-20T02:39:35.450758Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-12T12:08:51.431988Z","title":"Towards interpreting visual infor- mation processing in vision-language models.arXiv preprint arXiv:2410.07149, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.431988Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:33919c817f28b4e3bcae0873d5d347199bdc0c08af184c5f22f9604655e9782f","observation_id":"73d73144-6432-4148-9f8a-c10b50ba680b","resolution":{"observed_at":"2026-08-12T12:08:51.431988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.755415Z","title":"Interpreting gpt: The logit lens","venue":null,"work_id":"a25d1a7b-9d83-4e24-87b8-2deec1ec8ddb","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.434968Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:120ad0521d349bb5ca618276a9b24e5022caa4b8a9c9bbe07b0e5924fff150e8","observation_id":"5281fb7e-973f-4dee-b8bf-c06ac3d31b2f","resolution":{"observed_at":"2026-08-12T12:08:51.759334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.437050Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.437050Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:cea89a8e3c3bfe153ccc3ef27be519322e79e37115d04ba3d4b4932e6198b6f1","observation_id":"b41ac9f2-1cee-4e82-b4c6-0217cac9eb25","resolution":{"observed_at":"2026-08-12T12:08:51.437050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.744268Z","title":"A multimodal automated interpretability agent","venue":null,"work_id":"694ff777-adfc-45a7-a420-634e9cef0034","year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.439408Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:7de2f0bfa170409e71fb4d2834661cdcd8d6359a2e54dc6969f2bc97d244dda6","observation_id":"d516d450-f816-4a82-8e34-11933065aa28","resolution":{"observed_at":"2026-08-12T12:08:51.747230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09961","last_updated":"2025-02-28T13:33:00Z","snapshot_observed_at":"2026-08-18T23:26:00.281764Z","submitted_at":"2024-06-14T12:10:51Z","title":"ChartMimic: Evaluating LMM's Cross-Modal Reasoning Capability via Chart-to-Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09961","snapshot_observed_at":"2026-08-12T12:08:51.441277Z","title":"Chartmimic: Evaluating lmm’s cross-modal reason- ing capability via chart-to-code generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.441277Z"},"links":{"cited_paper":"/paper/2406.09961","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:83383e1243887c703990030a6661309f4aaf8588320addcf572cecbafa7f10d9","observation_id":"d04c8566-f351-47ef-a2c9-04baecb01423","resolution":{"observed_at":"2026-08-12T12:08:51.441277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-12T12:08:51.443855Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.443855Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:14311cfdb6dbe4c21ecde4d2b5b4f6ab93065b63b8fe68305b3484c28ca56a70","observation_id":"73eb3bb7-fda1-4246-8e3a-b3aab52b2418","resolution":{"observed_at":"2026-08-12T12:08:51.443855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-20T02:58:52.302783Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T12:08:51.446752Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.446752Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:09a642958a429f177da7b658c3b4f8ac16202edab39cfcfc66e610e2dbf47db9","observation_id":"4f574b5b-25e9-4d99-a0f9-906b87061d33","resolution":{"observed_at":"2026-08-12T12:08:51.446752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.449548Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.449548Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:c21515c6c34136e5f68dfe6500850758bed6d7f2c453e49852100b94882cd91a","observation_id":"bda0570c-9744-4e3d-b21d-977a0f286b40","resolution":{"observed_at":"2026-08-12T12:08:51.449548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.452004Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.452004Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:e9b346cd97b0987cea00366cd1f8b2c6f1335cd54e496009368526ba7821afc2","observation_id":"51702afa-4fef-46f5-88c0-487e4462ae75","resolution":{"observed_at":"2026-08-12T12:08:51.452004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T12:08:51.454947Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.454947Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:a55d98010ecacbfdb9e78a9c18a96ff4b04ffd240559b02a80b0c5860f776918","observation_id":"0281bca4-c325-4755-a8ac-af03796a52e1","resolution":{"observed_at":"2026-08-12T12:08:51.454947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-17T08:49:26.984989Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-12T12:08:51.457603Z","title":"EVF-SAM: Early vision-language fusion for text-prompted segment anything model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.457603Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:768bdda2491295c87605a044f2c049b43df751c2ebe006df13993e313ff9edd0","observation_id":"8a863dfb-10ab-4558-80f1-393dde893a8e","resolution":{"observed_at":"2026-08-12T12:08:51.457603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.728923Z","title":"Yes” and “No","venue":null,"work_id":"3dbc023e-2c16-44b3-a3ea-c363dca9b6df","year":2023},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.460785Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:c38dff1af61c5e8f4504e4a7de2ec23b49c1afe8a339dcccdd16f61e9258623a","observation_id":"bfb880ad-6c13-4597-8f83-50af331a3d1a","resolution":{"observed_at":"2026-08-12T12:08:51.731482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.721134Z","title":"Detect only tangible objects that can be interacted with","venue":null,"work_id":"b9ae1c49-223d-40fa-a510-0237f3aed37f","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.463653Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:415e22da3c11ae6154092b64b416f388958b71420eabb8702428df15d5ce6da1","observation_id":"f51b07f5-21bf-4cd0-808f-b3d1e1c630c7","resolution":{"observed_at":"2026-08-12T12:08:51.723722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.714341Z","title":null,"venue":null,"work_id":"fad50660-4ab0-44ef-b532-89551a9f8900","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.466555Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:5aaf4002c3d4d0bdf36acafec2f55e6e4cbde23b24ced029ba68c439fa89b906","observation_id":"9f2c0342-4454-4093-86ec-12f7d0279d76","resolution":{"observed_at":"2026-08-12T12:08:51.716852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.706772Z","title":"If half of the *physical objects* in the predicted caption are also in the groundtruth caption, the precision would be 0.5","venue":null,"work_id":"1f1d0e22-4dc0-4e50-8e4a-2fd67ae201c4","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.469117Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:0be9d66e8ab0d5751df6bfafbcbb362ff4db4f705fc91962eddea4423686cc5a","observation_id":"5da0c476-abd1-4512-8179-5f2a724f5722","resolution":{"observed_at":"2026-08-12T12:08:51.710171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.699763Z","title":"fine detail","venue":null,"work_id":"8ed08e4e-412b-4f31-9414-3baf9749a019","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.472159Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:cefce50e2d9eb94ee89e92ec01224d9a666a862e27c98fdb71a5bc3d724aad57","observation_id":"9d2d3c9b-50c3-4cf0-8050-b26dd699507d","resolution":{"observed_at":"2026-08-12T12:08:51.702409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.692770Z","title":null,"venue":null,"work_id":"4658f13d-b91e-4ad5-9039-5ec2a7a210cf","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.475675Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:bfc1bb5e03c79a62f053eef17b0f862f954cce2538c6a694e9b3d45867e69a5d","observation_id":"a82c2b7e-f90a-4250-b4a5-8f04be1fbf0c","resolution":{"observed_at":"2026-08-12T12:08:51.695247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.685729Z","title":null,"venue":null,"work_id":"36599855-8b04-4968-889e-f5b619a4673e","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.478135Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:9f0de2453e4b7e8866b5a189f5a9c72f92de3c6896fdf7e10c095c08516c4e95","observation_id":"25761686-1e43-4a08-a42a-2be8d0e0fcc1","resolution":{"observed_at":"2026-08-12T12:08:51.688283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.678281Z","title":null,"venue":null,"work_id":"a72c7b61-1116-4bd7-b860-92b19fc36e85","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.480453Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:e519462b3cf1969ca392e4a0088da3736e7e2c9a45bdc182ae368f06f34a9c47","observation_id":"3653dfb8-23e9-403a-b553-f87fb5ebd7c6","resolution":{"observed_at":"2026-08-12T12:08:51.681404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.670530Z","title":null,"venue":null,"work_id":"34c93d43-3f70-43f2-ae54-7178581c8cbe","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.482458Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:7d1c078d14332dd5220b6f3c5c5f924c97271c7af445634f7731e3b512deaeac","observation_id":"73d9ce69-4a03-4532-802f-d308c8b4c901","resolution":{"observed_at":"2026-08-12T12:08:51.673315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.663769Z","title":null,"venue":null,"work_id":"22e37e15-f4df-4a7d-8bbb-34150f8ad0da","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.484462Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:90224e101ec67d6e5625ff58cecb8a678ecbb471bc96afcf0b0b95e7aad41cdc","observation_id":"ac485285-edda-4d31-bf3c-fc2d54092387","resolution":{"observed_at":"2026-08-12T12:08:51.665987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.657384Z","title":null,"venue":null,"work_id":"377690d6-baa9-45fe-85f4-fcb1ccfaaed8","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.487084Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:3fed1f06b7c1985681f698101730cf29dad9e189356d34baac71ad5a8d79a6a2","observation_id":"78f7737a-3741-45b4-a557-3f4397f5e13a","resolution":{"observed_at":"2026-08-12T12:08:51.659499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.650324Z","title":null,"venue":null,"work_id":"d7e30476-5870-4b1f-8acf-f9e5bad111c8","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.489343Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:0dfbccea7c368f2c11eb0ed1824cab02a7b6a81459b185e8a7a5f2456f907c20","observation_id":"2c1ee46b-1ae9-46a4-a143-a916844f4bc0","resolution":{"observed_at":"2026-08-12T12:08:51.653036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.642438Z","title":null,"venue":null,"work_id":"637d9699-a7b2-4fcb-ab66-9d6450765f2b","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.491407Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:31b1189f8099272c41efbd19640c3c3aa3eb16d6c1fc8a084658e308f45b85b3","observation_id":"458bdb31-935d-4f0f-94e9-e4bdf654f928","resolution":{"observed_at":"2026-08-12T12:08:51.645088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.634561Z","title":null,"venue":null,"work_id":"9b4e2674-78db-4c19-9649-d07bd16431df","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.493247Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:b390e3bb77c9e95775f80aea83a371546045925a749d90326978cb3a05a13efd","observation_id":"24a70173-6466-4293-901b-0e2ab8cb358a","resolution":{"observed_at":"2026-08-12T12:08:51.637584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:08:51.626155Z","title":"Please answer yes or no","venue":null,"work_id":"8e198d19-1494-4a05-a5ee-f216cfb28732","year":null},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.495834Z"},"links":{"citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:c8e1748a914e65c03b27d7ea1b65ead3646f7b3366c09c0a56320c8c09b686c2","observation_id":"941f93b4-b6a6-430f-820b-847cf1e2ffa9","resolution":{"observed_at":"2026-08-12T12:08:51.629549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T04:50:08.813139Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 8 inbound Pith citation observations for arXiv:2411.17491."}