{"as_of":"2026-08-18T10:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b659a862e05a74639a10892350c5fcfe4d01cf9ba2532fba75190c795ffad36","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:01:40.085249Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.16727/citation-record","integrity":"/paper/2504.16727/integrity","json":"/paper/2504.16727/citation-record.json","paper":"/paper/2504.16727"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.631336Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.631336Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:e11bdff9ac9d1c5927c5c1cb5864f3506316f86f0e9bc6b582f950298cd45627","observation_id":"97ec323a-ec9f-430b-8b31-3c15c92376e1","resolution":{"observed_at":"2026-08-16T11:01:39.631336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.638039Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.638039Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:1ec579139ac576463d8d6254cbf9f1177f6b148cd71993ff916bc94bebebe737","observation_id":"cf68b0c9-acf6-4121-abd1-8a57c79aa8e7","resolution":{"observed_at":"2026-08-16T11:01:39.638039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-16T11:01:39.643026Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.643026Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:7eab717ba49c89570194788a1a8d629e428099efdb28e47d96993598952aca49","observation_id":"8b7442c2-e228-4152-a724-7dbc47cff0d0","resolution":{"observed_at":"2026-08-16T11:01:39.643026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-08-09T22:50:03.459615Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-16T11:01:39.648013Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.648013Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:f1692e70b2cdda4ec7bf36df282a4f82fe1863f4f4c39b294edc7b9dc7902227","observation_id":"da685c7d-6460-4f2b-be84-b125ec9432a2","resolution":{"observed_at":"2026-08-16T11:01:39.648013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-16T11:01:39.653003Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.653003Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:6271e9651a8b22e22353498633de7a69af4b1aa8545f4d854bb514d3ac0a90a1","observation_id":"b424f949-bb93-4945-be3e-2b4e92f4ed84","resolution":{"observed_at":"2026-08-16T11:01:39.653003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11665","last_updated":"2025-02-28T20:03:33Z","snapshot_observed_at":"2026-08-16T13:42:12.214429Z","submitted_at":"2024-06-17T15:49:51Z","title":"See It from My Perspective: How Language Affects Cultural Bias in Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11665","snapshot_observed_at":"2026-08-16T11:01:39.658149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.658149Z"},"links":{"cited_paper":"/paper/2406.11665","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:119009a16cae3c1854c94a19ca26e968eccc1fad3677debb8941e48d915fdda9","observation_id":"f2fc880b-7d27-4861-9d9e-e4b37fe1c67a","resolution":{"observed_at":"2026-08-16T11:01:39.658149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.664947Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.664947Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:0a5864daf68c770ede9d7adeb8966a8e9f47766996a0295e9c13be190292f3cf","observation_id":"e4248c0b-1f24-43c5-abc2-4a51ae17d25f","resolution":{"observed_at":"2026-08-16T11:01:39.664947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-16T11:01:39.670195Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.670195Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:5a41bd0eb4cb64a533ad19a66c9a19e8bf21f4f9d8aeb17a23ae7bb8eb5f0289","observation_id":"1980a252-4adb-461b-b17b-3fa046bdadb5","resolution":{"observed_at":"2026-08-16T11:01:39.670195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T11:01:39.675722Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.675722Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:413f3b282d1b9465eb6db02b84c3805734292367161ae51f6ea32b0e133e00ee","observation_id":"3ec1fcf5-3aee-41f4-acaa-12adbed600eb","resolution":{"observed_at":"2026-08-16T11:01:39.675722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.682091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.682091Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:a9a247bb7507cc6aafbeaea00061970edfc69135674015a114503888a3e03ebb","observation_id":"a9b024f8-a1d7-4ebd-8dab-97c118d63501","resolution":{"observed_at":"2026-08-16T11:01:39.682091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-16T11:01:39.687461Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.687461Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:622d706e684a787fb560a4da1409afef73ab0a92daab35eb3a7e7f4730bf9bd7","observation_id":"1c1b7bb4-ff73-4353-a000-fafd903f8a3f","resolution":{"observed_at":"2026-08-16T11:01:39.687461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03361","last_updated":"2024-10-21T04:26:41Z","snapshot_observed_at":"2026-08-16T13:28:08.884972Z","submitted_at":"2024-08-06T17:59:21Z","title":"GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03361","snapshot_observed_at":"2026-08-16T11:01:39.697849Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.697849Z"},"links":{"cited_paper":"/paper/2408.03361","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:76e7a3edfdacd74f98f711b96bc0cca0e0fe693d74c53c5dd695c109da618bd8","observation_id":"ba242164-361b-49a3-96e9-e71874d61941","resolution":{"observed_at":"2026-08-16T11:01:39.697849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.703064Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.703064Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:b170efa202ae5aefbc1a59354a6c9b34f31791639c56ed717b440c73ae665537","observation_id":"60d1f8f6-8ade-406f-a342-b55155c565cb","resolution":{"observed_at":"2026-08-16T11:01:39.703064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-16T11:01:39.708780Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.708780Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:d78026d8388837e12b50d39b602fee020c21c52472c58b963420c4a24a1304c3","observation_id":"fca509fc-b2f6-4c0a-86e8-06eb45f042cc","resolution":{"observed_at":"2026-08-16T11:01:39.708780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19622","last_updated":"2025-02-01T11:17:14Z","snapshot_observed_at":"2026-08-16T14:05:25.612830Z","submitted_at":"2024-03-28T17:42:54Z","title":"RH20T-P: A Primitive-Level Robotic Dataset Towards Composable Generalization Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19622","snapshot_observed_at":"2026-08-16T11:01:39.714202Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.714202Z"},"links":{"cited_paper":"/paper/2403.19622","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:5392ecfb178a0da3fda08ce837ab0597f98bee229a23cf652d92f82a2a91c9bc","observation_id":"b1542e83-8b05-4610-995a-f0db96387a9a","resolution":{"observed_at":"2026-08-16T11:01:39.714202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-16T11:01:39.719645Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.719645Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:fbe1dd00016ff33e59f25284fd41de853744244a2d55400d9bf4e69df8fa6520","observation_id":"8c6ec801-4426-42e7-a595-52e89c717985","resolution":{"observed_at":"2026-08-16T11:01:39.719645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.725020Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.725020Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:9e3fe13c5668a2d7dbe7df4631dd2f7a080319dd7c516317950839d85a8a3ae2","observation_id":"693b231c-ab09-4cf2-baad-70fe1ce10b44","resolution":{"observed_at":"2026-08-16T11:01:39.725020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.730778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.730778Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:79303082f467184043a649fa946afd14eedddac286838f0a3228313f65bce680","observation_id":"44fe01aa-94a9-4ed2-a7ea-24bb92d2d80a","resolution":{"observed_at":"2026-08-16T11:01:39.730778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-16T11:01:39.735440Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.735440Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:f977ca5f1012feb8d98296ff0ef1086abfb38cf69b971fad2870ccf73cccefc0","observation_id":"85226e3d-5393-4bd9-bd66-d86989026f72","resolution":{"observed_at":"2026-08-16T11:01:39.735440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.740442Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.740442Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:fc136f9cc7a9a9d83ee7bf523528ca50022bfc33287d1f133eee5d859efbf573","observation_id":"e3cff407-7cbf-46af-b677-2ac089e6a2c3","resolution":{"observed_at":"2026-08-16T11:01:39.740442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T11:01:39.746252Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.746252Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:22e99bc81f10f8204b51cf11b38ef039cad069ea475b4c03fb5db25d21a95d55","observation_id":"aafbde9b-c0ec-454c-9533-bc725b410cf4","resolution":{"observed_at":"2026-08-16T11:01:39.746252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:41.902201Z","title":null,"venue":null,"work_id":"a3a152d0-a4c5-4da4-814b-0c1495ed2e58","year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.751662Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:af3a3878b15373b02ea0913cc657294ea49cd77b7adac3b1da4f69323cd7dcbc","observation_id":"dd2fd0d3-5c13-4eab-b940-e3e09d4d100e","resolution":{"observed_at":"2026-08-16T11:01:41.911010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-16T11:01:39.759537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.759537Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:81ca916aa93f162a93fb3ef891cff6530a0a61901dbbee0a857543c12172c734","observation_id":"8949cbf4-ae19-4478-8f7f-4085d9fa726b","resolution":{"observed_at":"2026-08-16T11:01:39.759537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-16T11:01:39.764632Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.764632Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:27aafa3e8496ec341deb2199bc992de5748b54448fa7900dcf3c0e7acc571346","observation_id":"c96bee23-c5ae-414a-8fc6-9959e594e21c","resolution":{"observed_at":"2026-08-16T11:01:39.764632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","snapshot_observed_at":"2026-08-16T13:08:23.452837Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13611","snapshot_observed_at":"2026-08-16T11:01:39.771355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.771355Z"},"links":{"cited_paper":"/paper/2410.13611","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:baa76217c70cece16b17c3f42e863fa34defb526cfc4869aaab04cef52985672","observation_id":"f01f9e68-b6da-4d45-a0ca-c6e246a1d7a6","resolution":{"observed_at":"2026-08-16T11:01:39.771355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-16T11:01:39.782666Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.782666Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:e330339eaac1da7f33e4869c90b38c9eeb979f48071602917770b97d34e4f9af","observation_id":"25042b6a-658e-47d1-93fa-a9a7d86658ae","resolution":{"observed_at":"2026-08-16T11:01:39.782666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.787783Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.787783Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:3425d3c6ed039daa8292c1b5a90922fe4b230d0691fbf1a7752232729e0566ba","observation_id":"c6f89848-9af7-411b-9f49-3511e5cf0191","resolution":{"observed_at":"2026-08-16T11:01:39.787783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04055","last_updated":"2025-06-05T13:25:43Z","snapshot_observed_at":"2026-08-16T13:12:22.530615Z","submitted_at":"2024-10-05T06:28:54Z","title":"Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04055","snapshot_observed_at":"2026-08-16T11:01:39.792742Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.792742Z"},"links":{"cited_paper":"/paper/2410.04055","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:18348cbb2163a2e069d78b77234cc24d3e0568885c8c8a8fd9d5dbd5b3387adc","observation_id":"eca983f9-67c8-4c1a-9d0f-f9dc3b9d33a7","resolution":{"observed_at":"2026-08-16T11:01:39.792742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23224","last_updated":"2025-06-27T08:40:06Z","snapshot_observed_at":"2026-08-13T23:24:24.081618Z","submitted_at":"2025-05-29T08:14:40Z","title":"MMBoundary: Advancing MLLM Knowledge Boundary Awareness through Reasoning Step Confidence Calibration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23224","snapshot_observed_at":"2026-08-16T11:01:39.798306Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.798306Z"},"links":{"cited_paper":"/paper/2505.23224","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:7d47d07ea43e8dda3a2efc8c3d4179654ebc221b9ebd1625328d7cf1c39ccd32","observation_id":"54b81bdb-9f80-45fe-87d4-7f5dacbedb96","resolution":{"observed_at":"2026-08-16T11:01:39.798306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00166","last_updated":"2024-06-07T23:29:19Z","snapshot_observed_at":"2026-08-16T14:05:05.671153Z","submitted_at":"2024-03-29T21:45:53Z","title":"Uncovering Bias in Large Vision-Language Models with Counterfactuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00166","snapshot_observed_at":"2026-08-16T11:01:39.803579Z","title":"Fraser, and Svetlana Kiritchenko","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.803579Z"},"links":{"cited_paper":"/paper/2404.00166","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:9f81212bf189ecf040385195e83468bed4a2bfd602d6641e8171ee0fe80de46a","observation_id":"36f9864a-35c8-46e2-a99e-84055ae4c87f","resolution":{"observed_at":"2026-08-16T11:01:39.803579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09181","last_updated":"2024-04-21T09:51:58Z","snapshot_observed_at":"2026-08-16T14:18:39.265977Z","submitted_at":"2024-02-14T13:51:56Z","title":"OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09181","snapshot_observed_at":"2026-08-16T11:01:39.808655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.808655Z"},"links":{"cited_paper":"/paper/2402.09181","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:82d35167b0a29b7dc76fddd6de0f01c1b534523b3429d68f95149a3628f976f4","observation_id":"5e34acb8-8c12-4868-8def-13f8dd03e60a","resolution":{"observed_at":"2026-08-16T11:01:39.808655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.813407Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.813407Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:13a7ea2602e8f7b5ecaa87b6d5633df7b4fe4802c20b46cfd4f8be002965024a","observation_id":"b5946d6e-295f-4244-82bc-1b2c16b7be5e","resolution":{"observed_at":"2026-08-16T11:01:39.813407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.817880Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.817880Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:41393e8406588615287885bf978313d7451115bdac321191c36792aa531ecd66","observation_id":"633f170d-095b-48f3-8475-dc4ec9a8ca24","resolution":{"observed_at":"2026-08-16T11:01:39.817880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T11:01:39.822888Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.822888Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:9431cb58fbf000b521d98e1622927437705ef7ce5bbce2a5b54e7cba077e2494","observation_id":"ab161e2b-d8f7-4740-9e9b-6779058a7b92","resolution":{"observed_at":"2026-08-16T11:01:39.822888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.827635Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.827635Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:50ba769a33723cb89757011da32b1c7878db8d19fd9bee029ea96dfa7d65ee78","observation_id":"0eb79cc7-c5c0-4aa1-a4e8-52cf1a68a009","resolution":{"observed_at":"2026-08-16T11:01:39.827635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-08-17T11:56:26.482360Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-16T11:01:39.832116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.832116Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:1fc94a81e2d636acda74b04bf2dfd328205d5500468fd19884138380ff825af1","observation_id":"5648ec8d-639b-4df0-bcf0-3c04f82cfe5a","resolution":{"observed_at":"2026-08-16T11:01:39.832116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07112","last_updated":"2024-10-24T05:17:36Z","snapshot_observed_at":"2026-08-18T01:10:36.509016Z","submitted_at":"2024-10-09T17:46:34Z","title":"VHELM: A Holistic Evaluation of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07112","snapshot_observed_at":"2026-08-16T11:01:39.837833Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.837833Z"},"links":{"cited_paper":"/paper/2410.07112","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:122caa49c11280d778256f4f5c96856069d374fb864aa01a7a0a5c3bfa461f00","observation_id":"41f79523-1c8a-409c-bfaf-be2694fd13c2","resolution":{"observed_at":"2026-08-16T11:01:39.837833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-16T20:01:36.160048Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-16T11:01:39.842600Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.842600Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:c84ac690f4a405e5248e6f96a8821a471ef41cb955bb74a38b0ef897b6a0c920","observation_id":"04cfaf20-cb91-46c6-84d0-78f252d6d8d5","resolution":{"observed_at":"2026-08-16T11:01:39.842600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T11:01:39.847533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.847533Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:07a3b0250aad87f57d2a6783500fd1c5b85f3dde07f0ce03ad70db9c46919f09","observation_id":"042b4cef-96fe-4d96-8fa7-c15e39bbe193","resolution":{"observed_at":"2026-08-16T11:01:39.847533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17092","last_updated":"2023-11-28T05:53:55Z","snapshot_observed_at":"2026-08-16T14:39:46.784112Z","submitted_at":"2023-11-28T05:53:55Z","title":"SEED-Bench-2: Benchmarking Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17092","snapshot_observed_at":"2026-08-16T11:01:39.852160Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.852160Z"},"links":{"cited_paper":"/paper/2311.17092","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:ee52c47eff8a280510ec3009966cdb0e5558d1ecbec1bd0472ca430b383aa0c7","observation_id":"3c9cb6a9-59a9-47e1-a056-66c14a63f050","resolution":{"observed_at":"2026-08-16T11:01:39.852160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-16T11:01:39.857078Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.857078Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:0ec1d6c508bc793b889c2e53a63db903113bdcd9fb97a2294529cbb53cd91611","observation_id":"f82ada41-a7d9-4c4c-8d63-23da69b5f3d6","resolution":{"observed_at":"2026-08-16T11:01:39.857078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-08-17T03:02:06.550157Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-16T11:01:39.862054Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.862054Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:c562096103834c65c3c5bd6af776c973fc0c959037da8ee7945c287f002adae9","observation_id":"5c99ab68-9c42-462c-9338-5a7ac2288f8c","resolution":{"observed_at":"2026-08-16T11:01:39.862054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03418","last_updated":"2024-07-03T18:00:48Z","snapshot_observed_at":"2026-08-16T13:37:16.788213Z","submitted_at":"2024-07-03T18:00:48Z","title":"HEMM: Holistic Evaluation of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03418","snapshot_observed_at":"2026-08-16T11:01:39.867457Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.867457Z"},"links":{"cited_paper":"/paper/2407.03418","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:c9566b6997399825a2a01ad053614a80e03d68afc971be0059e14003fdc87157","observation_id":"3863bc25-fa56-4808-aeda-0a59ec104726","resolution":{"observed_at":"2026-08-16T11:01:39.867457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:41.882402Z","title":null,"venue":null,"work_id":"b8d5ac00-a4cc-4748-83d1-e685229512bb","year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.872051Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:95a200f32dcc9e74a85dc35cc70e3acd5f7d1bdc46bb57f660f197450845e3d3","observation_id":"2b90c306-6cf0-4e7d-927c-d5ed2af54666","resolution":{"observed_at":"2026-08-16T11:01:41.888068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:41.860207Z","title":null,"venue":null,"work_id":"60576675-b7d5-48bf-8a8c-cd88f919bafe","year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.876928Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:b7d4491c7893c7c7475b97d43026d6030b9b9f4f831bd4e839ec83b2af8c51fc","observation_id":"0bce2420-03b9-462e-a859-65f946ed7e04","resolution":{"observed_at":"2026-08-16T11:01:41.866022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.882037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.882037Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:54fedc032101027073a5a633576489621d97196102210b7c9e4a44b9eeacb28a","observation_id":"c9e1fed2-aa99-4f41-9449-1fbbe98bfa3a","resolution":{"observed_at":"2026-08-16T11:01:39.882037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-16T11:01:39.887255Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.887255Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:2ae52d0f33b5157155fab4424dfc52a435a3a20007e6779025452bf9ad8cc8c2","observation_id":"fac4da8b-d4c2-4e60-b8ad-ea8aacbae4db","resolution":{"observed_at":"2026-08-16T11:01:39.887255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.892089Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.892089Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:f6d3719600441d4fb231cdf4a7648f808390992dede08485220f343949de5cec","observation_id":"a6876fe4-bec2-4872-8f29-1fabff24bb08","resolution":{"observed_at":"2026-08-16T11:01:39.892089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-16T11:01:39.897134Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.897134Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:7335a3bca655d2b03324d74b4e468a95254713334d61f776ffb004bf9864b437","observation_id":"898a838e-6404-4bf2-9d2d-4d6d06c0073c","resolution":{"observed_at":"2026-08-16T11:01:39.897134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-16T11:01:39.902066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.902066Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:b891b67b79d199d245649654d80c25817f0b2adc73fa650644f6c4cfd198e787","observation_id":"7e00243f-d649-4568-8cf5-44f699ec3f4f","resolution":{"observed_at":"2026-08-16T11:01:39.902066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-16T11:01:39.907492Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.907492Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:7c85b9c577c2b0a1c20ba4d88d0536ff28317b51aa8e17b3afcb1d0e2c8061d0","observation_id":"feb1094c-effd-45c9-85bf-56c9a2e52b6a","resolution":{"observed_at":"2026-08-16T11:01:39.907492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09865","last_updated":"2022-08-31T05:12:59Z","snapshot_observed_at":"2026-08-18T03:21:04.083062Z","submitted_at":"2022-01-24T18:40:15Z","title":"RePaint: Inpainting using Denoising Diffusion Probabilistic Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09865","snapshot_observed_at":"2026-08-16T11:01:39.912475Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.912475Z"},"links":{"cited_paper":"/paper/2201.09865","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:ebcf7aa055fa1aad9fe3cfd1592de04c2114f2842de085c0f43f0fae6d27cd89","observation_id":"ae93ff32-ac72-4f78-b76d-a369f3ecf321","resolution":{"observed_at":"2026-08-16T11:01:39.912475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-08-16T13:10:34.900051Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-16T11:01:39.917497Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.917497Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:e358eb5790442bb74b8d8d5d529310aae12a6fc73e59179d4631f46b16dc61a8","observation_id":"55f14170-9609-4de9-a0ee-8b47686a30f6","resolution":{"observed_at":"2026-08-16T11:01:39.917497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03027","last_updated":"2024-11-24T06:22:37Z","snapshot_observed_at":"2026-08-16T14:03:50.278504Z","submitted_at":"2024-04-03T19:23:18Z","title":"JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03027","snapshot_observed_at":"2026-08-16T11:01:39.922578Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.922578Z"},"links":{"cited_paper":"/paper/2404.03027","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:c6364d8f71ae4ac707210dd4f153209cc4a5c459bb24e14ec96ae63c0e703ca0","observation_id":"33272fe0-72d2-4a0d-bcd6-7fd10d8f0f57","resolution":{"observed_at":"2026-08-16T11:01:39.922578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.04128","last_updated":"2017-01-25T06:32:29Z","snapshot_observed_at":"2026-08-15T15:08:42.033246Z","submitted_at":"2017-01-15T23:52:49Z","title":"Understanding the Effective Receptive Field in Deep Convolutional Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.04128","snapshot_observed_at":"2026-08-16T11:01:39.927595Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.927595Z"},"links":{"cited_paper":"/paper/1701.04128","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:455dab5e71902452d62f1feb512a171b33b2df3b2b7a8513f80286478c5eb9e6","observation_id":"e6638828-2023-4b5d-bffe-659279e774c9","resolution":{"observed_at":"2026-08-16T11:01:39.927595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:01:39.932697Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.932697Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:06836571288681c32e69cc0fa7186139f1c81b6255d3c8de212c4606adf0a194","observation_id":"feec921a-8090-4aa3-9e7b-82fb30a57fe8","resolution":{"observed_at":"2026-08-16T11:01:39.932697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-16T11:01:39.937755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.937755Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:b5a70e9f8b16cf689af9de03440cd3d9957baa2a625d2407cb505939d57e0d23","observation_id":"0c773764-d7c0-4a67-a71b-260a501209dc","resolution":{"observed_at":"2026-08-16T11:01:39.937755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.942314Z","title":"Fung, Weizhu Chen, Minhao Cheng, and Furu Wei","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.942314Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:a74010fe91d120780fd34896e9c93229e9cc7c900659ac7fb898bca0e4fd16a0","observation_id":"6e2d15b7-193b-404c-bca8-c3895309f7ea","resolution":{"observed_at":"2026-08-16T11:01:39.942314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-16T11:01:39.946890Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.946890Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:2cf7fed849b34d67fd1267ac65fc62a19023d5cda5bdf4f47dc8e243f916e79e","observation_id":"59fac2be-1fed-4eb4-93ce-d1457a97f957","resolution":{"observed_at":"2026-08-16T11:01:39.946890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08810","last_updated":"2022-03-03T22:04:47Z","snapshot_observed_at":"2026-08-16T18:02:13.044021Z","submitted_at":"2021-08-19T17:27:03Z","title":"Do Vision Transformers See Like Convolutional Neural Networks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.08810","snapshot_observed_at":"2026-08-16T11:01:39.951802Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.951802Z"},"links":{"cited_paper":"/paper/2108.08810","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:95c740b68131c9f1ec70e71e4bc7d5907344cd15a526c9b6fc5a8626b3042569","observation_id":"8887fab4-65cf-4412-9199-5ecaedfbfb23","resolution":{"observed_at":"2026-08-16T11:01:39.951802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.956494Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.956494Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:865742ba61a2fb909ff4637caf2f0326f602edd494a3ac6c65a2e9c9912b78fd","observation_id":"4fc1710d-c783-46fa-aa99-7f0434b99d22","resolution":{"observed_at":"2026-08-16T11:01:39.956494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:39.961208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.961208Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:56de785f0d3f28a5fb71cd690b092d0daa0b606f0713f7a53f2206d8310e1003","observation_id":"8d42653b-fb23-4fa9-9598-e93da7c83d6f","resolution":{"observed_at":"2026-08-16T11:01:39.961208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T11:01:39.966661Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.966661Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:fca16a6f9cc4135bd94e272ee3e3b390533ffb4b4f75da4309b86fd99acb0fda","observation_id":"6e7b3624-e1ef-44ea-b6c7-b0ad977327e2","resolution":{"observed_at":"2026-08-16T11:01:39.966661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04048","last_updated":"2023-10-24T14:56:51Z","snapshot_observed_at":"2026-08-16T15:50:04.573553Z","submitted_at":"2023-03-07T16:57:20Z","title":"Is ChatGPT a Good NLG Evaluator? A Preliminary Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04048","snapshot_observed_at":"2026-08-16T11:01:39.971339Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.971339Z"},"links":{"cited_paper":"/paper/2303.04048","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:0058ff9c56ef988d037b50f37a06cf67be4186d5eb99dceb0b29b8e5e4a49c5b","observation_id":"f4adc990-3dc9-41f2-94b0-f50969ae1594","resolution":{"observed_at":"2026-08-16T11:01:39.971339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-16T11:01:39.976358Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.976358Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:f874ec4f8413c1ac85ba07e5b98d1fcfc0737a16776c3b6f92a396908093e8e7","observation_id":"8b9c1474-9b5a-4f77-9bfe-1f1c04b2e7e5","resolution":{"observed_at":"2026-08-16T11:01:39.976358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-16T13:42:20.592010Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-16T11:01:39.981135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.981135Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:f27445d8f69bc141f867f04343aa7f32bebdaeedbd2f911c36ef68aa6ee95f54","observation_id":"de59de8d-922f-4c0d-bb8b-d3596fbe2d23","resolution":{"observed_at":"2026-08-16T11:01:39.981135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T11:01:39.985980Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.985980Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:629bebb22ccd29aaa85c9b1e0e82b7947446f6a3cf0e721f8222f2454385ddf9","observation_id":"7ccbd96a-56da-4428-b16e-9c6134bf9dc0","resolution":{"observed_at":"2026-08-16T11:01:39.985980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14194","last_updated":"2026-04-05T17:10:43Z","snapshot_observed_at":"2026-08-17T22:52:10.617093Z","submitted_at":"2024-06-20T10:56:59Z","title":"VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14194","snapshot_observed_at":"2026-08-16T11:01:39.990724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.990724Z"},"links":{"cited_paper":"/paper/2406.14194","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:147a4672f330217de0d0316001bb4e92a3abd65cac5d4e11d419af288d6a4ef8","observation_id":"0d8d37d1-8d89-41ba-8052-6ca97de4ea45","resolution":{"observed_at":"2026-08-16T11:01:39.990724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16170","last_updated":"2023-12-26T18:59:11Z","snapshot_observed_at":"2026-08-16T14:31:31.874614Z","submitted_at":"2023-12-26T18:59:11Z","title":"EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16170","snapshot_observed_at":"2026-08-16T11:01:39.995700Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:39.995700Z"},"links":{"cited_paper":"/paper/2312.16170","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:8f8334501f959e4bc29fe3e9f3066f8e401ea79a94b8797cf1beff3e5271cf0a","observation_id":"3eee00be-a2b6-4228-9583-7cfae4873657","resolution":{"observed_at":"2026-08-16T11:01:39.995700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18457","last_updated":"2025-02-10T07:46:06Z","snapshot_observed_at":"2026-08-15T06:55:10.397869Z","submitted_at":"2025-01-30T16:15:38Z","title":"CALM: Unleashing the Cross-Lingual Self-Aligning Ability of Language Model Question Answering","version":2},"cited_work":{"arxiv_id":"2501.18457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.18457","snapshot_observed_at":"2026-08-16T11:01:40.440092Z","title":"CALM: Unleashing the Cross-Lingual Self-Aligning Ability of Language Model Question Answering","venue":"cs.CL","work_id":"4f8e188a-7509-42d8-908b-b0868201e7a3","year":2025},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.000629Z"},"links":{"cited_paper":"/paper/2501.18457","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:086b832b92811e1639c16ebdd57d95d387931d95f6561851f17d01931b2bbd51","observation_id":"972bbe9d-0cd6-4950-ae6b-8ab2272aabcf","resolution":{"observed_at":"2026-08-16T11:01:40.448586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-16T20:24:52.403788Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-16T11:01:40.010747Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.010747Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:3aaab967a53fd6ccf07a16022721e0651269a20159b29dd6e9c29d7f36ab9f86","observation_id":"d085772f-4ad8-4177-9522-0bbf42e505ff","resolution":{"observed_at":"2026-08-16T11:01:40.010747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:41.816980Z","title":null,"venue":null,"work_id":"670ef5b1-1f3c-464e-beaa-0020f83fbb32","year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.016299Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:07cf7f3771360cda94d8ec89b69ef116cd7b2eec1caa32cc30153035d98c1c57","observation_id":"54803c1c-4f9f-43f5-8e39-a41e4de698cc","resolution":{"observed_at":"2026-08-16T11:01:41.824079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:01:41.800226Z","title":"Sadler, Dinesh Manocha, and Amrit Bedi","venue":null,"work_id":"a07c7560-d5ca-48fb-9209-b472025ee5a5","year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.020920Z"},"links":{"citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:4e432f5e8b5717a8fed6db45c4a721f1e46f0e812fe843431f715e3cfca4f4fc","observation_id":"e2415dfe-1ed6-4450-ad08-508b124350ed","resolution":{"observed_at":"2026-08-16T11:01:41.805654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06007","last_updated":"2024-11-03T16:54:14Z","snapshot_observed_at":"2026-08-16T13:44:41.313680Z","submitted_at":"2024-06-10T04:07:09Z","title":"CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06007","snapshot_observed_at":"2026-08-16T11:01:40.025936Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.025936Z"},"links":{"cited_paper":"/paper/2406.06007","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:00a58087210bd277382d6947135ed580498a2669c87746c0b595c125e9e0c6b2","observation_id":"d3382be4-a904-4460-8a3b-1e7de1b34b7d","resolution":{"observed_at":"2026-08-16T11:01:40.025936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18752","last_updated":"2023-05-30T05:27:21Z","snapshot_observed_at":"2026-08-16T18:38:00.972721Z","submitted_at":"2023-05-30T05:27:21Z","title":"GPT4Tools: Teaching Large Language Model to Use Tools via Self-instruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18752","snapshot_observed_at":"2026-08-16T11:01:40.030970Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.030970Z"},"links":{"cited_paper":"/paper/2305.18752","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:9cb55ad3224c7e6c2c3de160e4b8b839894e5d65f6770cd473f5b1d08b410693","observation_id":"0922a4bb-0077-4694-b316-048a59fc417c","resolution":{"observed_at":"2026-08-16T11:01:40.030970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-16T11:01:40.035975Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.035975Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:cd0615ba3a5bf94de6625ad160ed8d1f743f23414caef3c180b93353e5b82b3e","observation_id":"6aa326c0-2ad9-43b2-aedd-a54905e6fd8e","resolution":{"observed_at":"2026-08-16T11:01:40.035975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-16T11:01:40.040858Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.040858Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:818df081a68654094cd3513a3375d99f9ed2b805e068cf34399d169f748202b1","observation_id":"4c6d869c-3eb4-4f67-b1e1-6f2f1bfcabc1","resolution":{"observed_at":"2026-08-16T11:01:40.040858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-16T14:32:38.574557Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-08-16T11:01:40.046199Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.046199Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:a301f4e796b308ed11d7ac90fe33535b65fae1eded8d2cb0582d5690904e77bf","observation_id":"a75edee2-559d-49d5-8e73-38109433dc06","resolution":{"observed_at":"2026-08-16T11:01:40.046199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09346","last_updated":"2024-12-28T07:32:00Z","snapshot_observed_at":"2026-08-16T14:09:50.995059Z","submitted_at":"2024-03-14T12:51:07Z","title":"B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09346","snapshot_observed_at":"2026-08-16T11:01:40.051890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.051890Z"},"links":{"cited_paper":"/paper/2403.09346","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:ea24c8a9d5cf233f24d95a4c4aba833103762fa026ccd6c1da75bfabffab33b3","observation_id":"f46a637a-2a90-47e8-a35d-77a7e578fd7f","resolution":{"observed_at":"2026-08-16T11:01:40.051890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12084","last_updated":"2025-07-02T07:38:09Z","snapshot_observed_at":"2026-08-17T09:26:13.322293Z","submitted_at":"2025-02-17T17:57:50Z","title":"VLM2-Bench: A Closer Look at How Well VLMs Implicitly Link Explicit Matching Visual Cues","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12084","snapshot_observed_at":"2026-08-16T11:01:40.057148Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.057148Z"},"links":{"cited_paper":"/paper/2502.12084","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:87e7144bf679458ad7586f19af366b254840f45eb95e8d7c75d05cb85adf3ce2","observation_id":"d7057694-7f5b-47c6-ba10-83085e0531f5","resolution":{"observed_at":"2026-08-16T11:01:40.057148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-16T11:01:40.063205Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.063205Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:41e2f2c1f0dc9f6f78fe843934e41e7cb5567b1f707ab6606a97b9402e291d51","observation_id":"88c25f89-f030-4fce-b34f-1cf6a821bafd","resolution":{"observed_at":"2026-08-16T11:01:40.063205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-16T15:17:42.537490Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-16T11:01:40.068908Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.068908Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:1d79c0f08509a5daa12354626be79494775ded7e3b8a326352bc0fd2c635348d","observation_id":"dabc7c38-4091-404a-81af-d52e9aeafb39","resolution":{"observed_at":"2026-08-16T11:01:40.068908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-16T11:01:40.074153Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.074153Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:385dbe7f756f62b73a98e63958f0b14a95f019edb286117705b418b0658fd764","observation_id":"80d7c525-3310-4514-b9ec-67852d498a50","resolution":{"observed_at":"2026-08-16T11:01:40.074153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-08-16T13:50:10.927560Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-16T11:01:40.079295Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.079295Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:f15b92a5042187d146f22879f2418f77ed5325d5665fdb196bf8ff252704fb2b","observation_id":"dc96f8b9-6047-48d9-ab5a-b7f50bfb9628","resolution":{"observed_at":"2026-08-16T11:01:40.079295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-16T11:01:40.085249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-16T11:01:40.085249Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2504.16727"},"observation_digest":"sha256:d83256b0b90e577a922be60d06c393c7a49aae9f415ec4ef979d9dae49df5b98","observation_id":"168bf0b1-a005-45c2-8981-8aab8554305f","resolution":{"observed_at":"2026-08-16T11:01:40.085249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.16727","last_updated":"2025-06-02T17:24:17Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T08:58:05.249052Z","submitted_at":"2025-04-23T14:01:32Z","title":"Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2504.16727."}