{"as_of":"2026-08-13T11:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:496a2b45f3efd50cdf63e05fa5f4c71bf301ad2701e3bc4c68554347e3522331","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:03:24.836356Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14725/citation-record","integrity":"/paper/2411.14725/integrity","json":"/paper/2411.14725/citation-record.json","paper":"/paper/2411.14725"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T15:03:23.770624Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.770624Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:a1802441285cc9a1da028ee1faf9b4897621cb36f609f7fbfbf6a9b1749d9919","observation_id":"29f63658-53bf-4aba-9f23-ce43457dc585","resolution":{"observed_at":"2026-08-12T15:03:23.770624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-12T23:06:15.847795Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-08-12T15:03:23.786991Z","title":"Al-Tahan, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.786991Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:b8a6d133a720fc9e4bde47d3463f9d5eb7c272ea96ee058ed7d17b53b9fb04fc","observation_id":"17e6553f-9f94-4f44-aac6-1cd611c55cae","resolution":{"observed_at":"2026-08-12T15:03:23.786991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:27.096960Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"1f061e49-33e7-4a4b-a1e3-565c9b57a8ee","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.818926Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:ca98f58b3db7372bc7142e3f312770ad090a30e4e4984b742eb2e0c6ebbfce8a","observation_id":"4b7f9521-41e0-4bed-bb9c-4d07204918cc","resolution":{"observed_at":"2026-08-12T15:03:27.104020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04667","last_updated":"2025-04-02T15:17:02Z","snapshot_observed_at":"2026-08-13T03:10:12.967913Z","submitted_at":"2024-08-06T16:43:35Z","title":"Non-Determinism of \"Deterministic\" LLM Settings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04667","snapshot_observed_at":"2026-08-12T15:03:23.837472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.837472Z"},"links":{"cited_paper":"/paper/2408.04667","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:8c12de50720aeb0cbdf57396e8274faa9d81d4883c232a2af64721d61cb719d6","observation_id":"4dd63f1c-c7d0-4a21-b8ec-672b916c5bad","resolution":{"observed_at":"2026-08-12T15:03:23.837472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T15:03:23.871962Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.871962Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:88a52a227af5b66a45c7e48610a9670ed7e502e2c799d6ed5b1e6b3e10aeea3a","observation_id":"010a7473-fc9e-4e04-957e-d292964a54b4","resolution":{"observed_at":"2026-08-12T15:03:23.871962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-12T15:03:23.904276Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.904276Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:5e8c744a1d61ab887fbb82f055db72940ffde83bafcd420ffed3f853d8411b18","observation_id":"f6e0c276-55a1-40d6-a0cf-39bbb76421d6","resolution":{"observed_at":"2026-08-12T15:03:23.904276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10566","last_updated":"2024-09-13T18:01:49Z","snapshot_observed_at":"2026-08-12T22:45:15.997572Z","submitted_at":"2024-09-13T18:01:49Z","title":"Eureka: Evaluating and Understanding Large Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10566","snapshot_observed_at":"2026-08-12T15:03:23.957999Z","title":"Balachandran, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.957999Z"},"links":{"cited_paper":"/paper/2409.10566","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:07e90a5dab3a5628374c8f8f15d6d896a7a7cdd04d2382c1fa55ec935d20e744","observation_id":"592d8c6c-0a72-40e8-b66a-d1f9e90797b0","resolution":{"observed_at":"2026-08-12T15:03:23.957999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T15:03:23.965262Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.965262Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:da7641b41a11b3698c17c5b4d226ec70b557363fc65a736c28dcd43c39aa13e1","observation_id":"d75277d9-30a9-4b51-958b-d3ff16e000d1","resolution":{"observed_at":"2026-08-12T15:03:23.965262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-12T15:03:23.972836Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.972836Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:1ef7d38cc2b90e66bd7ebb9238323c6e5c1df88d84e210d1cb48bdaece056966","observation_id":"9e811f0f-c327-4f70-9912-7d228f702d79","resolution":{"observed_at":"2026-08-12T15:03:23.972836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T15:03:23.978719Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.978719Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:de6049c6d5c46411e22e2d13476b599866072cb9cc28f4fe511d5c9ef9a2d0d5","observation_id":"21a2f1b4-1b4d-4656-9d21-9cc70730fd1e","resolution":{"observed_at":"2026-08-12T15:03:23.978719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-12T22:43:01.323456Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-12T15:03:23.984309Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.984309Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:54eb7cf979506ff92403c80c24710ae05f324985f7b8b4d46a931bcec5ac0671","observation_id":"f054d048-c168-4083-8c5b-19c9e477b4dd","resolution":{"observed_at":"2026-08-12T15:03:23.984309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T15:03:23.989904Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.989904Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:08301a5508ed44e4b49600ead3a0924f12fe3293b8bcceaf9c6c5b1c0f6af547","observation_id":"bd75654c-1b80-4804-bf6f-7f17fc094c34","resolution":{"observed_at":"2026-08-12T15:03:23.989904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T15:03:23.995882Z","title":"Hurst, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.995882Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:a3fe39ce1fc5ade517630e4adcd3b7723e7ca48c4112b6b48c261cf857f8e1c9","observation_id":"142f118c-2802-4fee-89e7-c344e8f7350e","resolution":{"observed_at":"2026-08-12T15:03:23.995882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-13T03:27:01.609831Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-12T15:03:24.002580Z","title":"Ilharco, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.002580Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:1e2e9e0f3e23d3035cec4ef003e222c0139c66cf1905a0436e2ca58f88c5d603","observation_id":"8958e039-5a48-4600-8a83-0d73af34ad82","resolution":{"observed_at":"2026-08-12T15:03:24.002580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-13T00:16:01.500475Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-12T15:03:24.010418Z","title":"Jiang, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.010418Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:de7c1f18e02beb9afe3e7f54aab9bf4752a2aedef21a46b94dd2f06180027f28","observation_id":"8020696b-2d88-4235-9430-16c73e0b7b33","resolution":{"observed_at":"2026-08-12T15:03:24.010418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:27.050557Z","title":"Kembhavi, M","venue":null,"work_id":"83116e2a-61c4-44f8-a164-99844ee99dfa","year":2016},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.020558Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:09a7eaf63d210807e0fad5bbb938ef25dedd73527f096455ecf9cb89a51a34dc","observation_id":"53f61553-04d1-475e-b527-02875aa567fa","resolution":{"observed_at":"2026-08-12T15:03:27.081220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.969735Z","title":null,"venue":null,"work_id":"6db77c7b-1a6a-4fc9-81ee-feed4c9619bd","year":2022},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.025849Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:2f1278ff54dc23453cf86280b003b7802b46c44ac17acad3d7a7913bdd91a024","observation_id":"e10dfaac-e4cb-4126-8a3a-aac64e9c0850","resolution":{"observed_at":"2026-08-12T15:03:26.981473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.951708Z","title":null,"venue":null,"work_id":"7449b522-23ab-4f6f-a1f4-6fc0f6d81bbf","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.031716Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:f25e96cb252f9aec18ebfb2b7e07ef3cd87a4a7590de9db58cda80c8546a59cb","observation_id":"8d2e9f02-2eda-4165-9a63-59487947c66c","resolution":{"observed_at":"2026-08-12T15:03:26.956819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T15:03:24.037367Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.037367Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:51209468348b75bd4cf612bb8840d2b80a935d40c19363dc8b27231ea5407603","observation_id":"e8c890f3-d616-4444-b28c-1e4c30500148","resolution":{"observed_at":"2026-08-12T15:03:24.037367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:24.043058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.043058Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:25704951f94ec68e3cfd519d40482d1d16091a4d3ad219302e7fe2f29367fdb3","observation_id":"021cca4d-b97f-457a-94cc-63aa3825ecdc","resolution":{"observed_at":"2026-08-12T15:03:24.043058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.921865Z","title":null,"venue":null,"work_id":"cca3ae8b-57d8-4b23-bc74-e30c31a4969b","year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.061742Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:d49e9a02d4fc21f33f03f92e8137f8b618bf55ab1c6cd37a5e8c480a60fb6094","observation_id":"6b522d49-fecd-4b49-a8aa-e01599866372","resolution":{"observed_at":"2026-08-12T15:03:26.926888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:24.077979Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.077979Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:a8d4f34f05abb2a53955619cf73c9c1bf8562d51270589a4877507cd8188f646","observation_id":"5e19d423-3489-49aa-bfb3-53f14d09e3f6","resolution":{"observed_at":"2026-08-12T15:03:24.077979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:24.105463Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.105463Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:ab09c7e998fc80e4b2dafe537a397f7ee6448327e38f947a99d31f1370e32f82","observation_id":"2db77923-8e89-4ab5-b815-4b1b233f7607","resolution":{"observed_at":"2026-08-12T15:03:24.105463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.880552Z","title":null,"venue":null,"work_id":"47e32584-afda-4d64-9a91-279a56cfc757","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.129970Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:e3c16ed81cf14d7e51f8b81c90e6c92b5db26a36d4262a37beee673d5b7af5b6","observation_id":"263e4985-f8a3-42ad-92fc-1f79f61dd4ae","resolution":{"observed_at":"2026-08-12T15:03:26.886416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04828","last_updated":"2024-11-05T02:32:06Z","snapshot_observed_at":"2026-08-12T22:49:27.929514Z","submitted_at":"2024-09-07T13:41:37Z","title":"POINTS: Improving Your Vision-language Model with Affordable Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04828","snapshot_observed_at":"2026-08-12T15:03:24.193907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.193907Z"},"links":{"cited_paper":"/paper/2409.04828","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:0db887eacb1617452cb653e3f268ac2321cf0041d78028e8fd04845aad29d06b","observation_id":"0edbedc9-203e-4399-ba68-21537ae5f149","resolution":{"observed_at":"2026-08-12T15:03:24.193907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-12T15:03:24.261105Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.261105Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:0a7e9e0f30ea710350c3291bbb18f2308f8fe68f995e50c04dff37854db5b335","observation_id":"347de614-63f3-4d72-a2fb-a01538441053","resolution":{"observed_at":"2026-08-12T15:03:24.261105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-12T23:53:21.822871Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T15:03:24.301248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.301248Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:7dfe612eee0ba1a9f22f76c2ceb1ec81519c2517b3130be1618a64bfd11463d4","observation_id":"2599b4e7-255d-4427-bf93-cc868e3785a3","resolution":{"observed_at":"2026-08-12T15:03:24.301248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-12T15:03:24.319323Z","title":"Masry, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.319323Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:7eb61f2f01566b0433d0401a69a1c7b99ec96bcf5cbf7076d8602b55affd3b99","observation_id":"0cec2fa3-9d64-4e00-bbf2-9a0d6e90c994","resolution":{"observed_at":"2026-08-12T15:03:24.319323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.862867Z","title":"Mathew, D","venue":null,"work_id":"59656e46-091e-4919-83f0-2b00e223135b","year":2021},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.324376Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:60297f3d35acb8c63ed86437d1ff2ac1f0faac903351248ec882bb0de957d5a1","observation_id":"b7f4f425-487d-4f19-9e97-541f6085ab88","resolution":{"observed_at":"2026-08-12T15:03:26.868949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13826","last_updated":"2024-10-24T17:27:22Z","snapshot_observed_at":"2026-08-12T22:20:40.943270Z","submitted_at":"2024-10-17T17:51:40Z","title":"Unearthing Skill-Level Insights for Understanding Trade-Offs of Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13826","snapshot_observed_at":"2026-08-12T15:03:24.329453Z","title":"Moayeri, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.329453Z"},"links":{"cited_paper":"/paper/2410.13826","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:674819ad846c909ec7e582fcf7d105bc62d730a2d12ab03c9549785b8e584eff","observation_id":"bc9917e4-889c-470f-abda-c12dc38b9e3c","resolution":{"observed_at":"2026-08-12T15:03:24.329453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.841086Z","title":"Gptv system card, 2024","venue":null,"work_id":"ffc322d3-ecc6-41f6-bebe-631a7fd16b39","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.340481Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:3864071b79b6e97bb288d0e55f877e8c2fe196b5cb67f036539ec6535b9f0ea7","observation_id":"68d6272c-3291-41b4-a9df-6fe3b227fcde","resolution":{"observed_at":"2026-08-12T15:03:26.847137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T15:03:24.345745Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.345745Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:8666dad234ff80d31362c88697bca29a2c6313654d3209cb6dbe36a0672115b4","observation_id":"0765cc2b-5eb3-474d-a2d0-b26d576bdb56","resolution":{"observed_at":"2026-08-12T15:03:24.345745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:24.351317Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.351317Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:2595014ad7c051d4ec9995a7486635b3f2d29344709473698c30ddbcb8c41cfa","observation_id":"1bc1e516-d884-49a6-a17c-5ee536a18e6c","resolution":{"observed_at":"2026-08-12T15:03:24.351317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:24.356784Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.356784Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:00b94e0a82b80ff7f62f5bb0edd93c274b235270f754a8dc8099376c24b74ac7","observation_id":"e991f5d8-d7e9-4a40-9872-834a9dc98c8d","resolution":{"observed_at":"2026-08-12T15:03:24.356784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-12T15:03:24.362312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.362312Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:9bcb2592dd5318f530f08f864f1bb5cded8070e70bb03eace26f82e8b20aa1f9","observation_id":"ceee076c-99d7-4175-8225-be5f4adbde4a","resolution":{"observed_at":"2026-08-12T15:03:24.362312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T15:03:24.367607Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.367607Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:c789d13bbef64418bec01651b76cad89939a2523526fc895c6bd6ba51e8e7b5a","observation_id":"caf8f6ce-7441-477c-8a97-eac1e07e505c","resolution":{"observed_at":"2026-08-12T15:03:24.367607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-12T15:27:37.917473Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-12T15:03:24.373327Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.373327Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:0ce30cc1794d6ec4025ca9c7d2e3057d3459d59e1039ddcd4ba5056a345fc5a6","observation_id":"00d683b2-4ffb-4c06-b471-c4b5326f1ec2","resolution":{"observed_at":"2026-08-12T15:03:24.373327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T15:03:24.378871Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.378871Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:d7ab6d5eb696a51d87417f45661ec716e7715368e57a6e7973573673fb6d90a1","observation_id":"a72697f6-6066-407f-bd7f-d8b07573fb79","resolution":{"observed_at":"2026-08-12T15:03:24.378871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13803","last_updated":"2024-03-20T17:59:16Z","snapshot_observed_at":"2026-08-13T00:49:15.624748Z","submitted_at":"2024-03-20T17:59:16Z","title":"Bounding Box Stability against Feature Dropout Reflects Detector Generalization across Environments","version":1},"cited_work":{"arxiv_id":"2403.13803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13803","snapshot_observed_at":"2026-08-12T15:03:25.002289Z","title":"Bounding Box Stability against Feature Dropout Reflects Detector Generalization across Environments","venue":"cs.CV","work_id":"9e9120e4-cbb7-4626-9ec6-173b5e7c3f6d","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.384210Z"},"links":{"cited_paper":"/paper/2403.13803","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:c7eefa83ab2d5e774e92465e36043360411e8b0a38a05d8b85ae724a690e110a","observation_id":"224732bf-b199-4101-8915-c6a23b8bba40","resolution":{"observed_at":"2026-08-12T15:03:25.023717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T15:03:24.389774Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.389774Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:68d8ee0f0814f0b7e44e74f6ed10b38ca996aebefe9cf7c8b06813b53b07ad9d","observation_id":"1c421364-0ecb-4800-aa2c-120399cb8363","resolution":{"observed_at":"2026-08-12T15:03:24.389774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.629603Z","title":null,"venue":null,"work_id":"5e2b98da-6e6b-49e4-ab71-2c70e659fd74","year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.395596Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:34f98f0810ea9953fd1198d9f5aebec73f019bd6fd195fa72da6f58f50dcf50c","observation_id":"4a1c64b2-93a3-4586-846b-58f0c01c7b66","resolution":{"observed_at":"2026-08-12T15:03:26.679958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.611483Z","title":null,"venue":null,"work_id":"e99b1aa7-fc08-4163-ae15-98cd7bec4fbf","year":2023},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.415999Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:f22a3d82a57ca3f8bff5262d83ab1dbf67d43f58d9090924e0ebfafdd02cca37","observation_id":"61c2b739-a403-4914-a3cd-718564c4f772","resolution":{"observed_at":"2026-08-12T15:03:26.618098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-12T15:03:24.449765Z","title":"Zhang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.449765Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:4ae6b2bff05f1546322351b2e3d8ec3aa77d6faf8a8c8fbafdf830ce8f72415f","observation_id":"624ae08f-463a-4c14-b7e6-c1c29655e177","resolution":{"observed_at":"2026-08-12T15:03:24.449765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14156","last_updated":"2024-10-06T09:51:25Z","snapshot_observed_at":"2026-08-13T00:01:00.777873Z","submitted_at":"2024-05-23T04:08:23Z","title":"Unveiling the Tapestry of Consistency in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14156","snapshot_observed_at":"2026-08-12T15:03:24.493884Z","title":"Zhang, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.493884Z"},"links":{"cited_paper":"/paper/2405.14156","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:24a8c7ec8a3b456324ca98d9d319a56f815c39dc12c5645269e872ea288b64da","observation_id":"07c16031-c15b-45eb-8a98-14b19ba41a23","resolution":{"observed_at":"2026-08-12T15:03:24.493884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12742","last_updated":"2024-06-18T16:02:18Z","snapshot_observed_at":"2026-08-12T23:39:56.903028Z","submitted_at":"2024-06-18T16:02:18Z","title":"Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12742","snapshot_observed_at":"2026-08-12T15:03:24.558647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.558647Z"},"links":{"cited_paper":"/paper/2406.12742","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:f8f7478336a123601cc1fc2c60493d29c7cb11bdaee85071e14062021498e910","observation_id":"d1ca39bc-2e83-4c11-a2d1-f441b52e5a69","resolution":{"observed_at":"2026-08-12T15:03:24.558647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.583014Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"2fee7b8c-ab61-4195-8d36-2ae9aece5548","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.636112Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:ed224fc27f7611d2429c18b730e04ffb7a5b288b00b7507f8418ed724d8d5318","observation_id":"45ff90b9-7d09-4f1d-8fd9-6c536de9e14b","resolution":{"observed_at":"2026-08-12T15:03:26.598812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.415575Z","title":"Limitations","venue":null,"work_id":"b83bcf2b-6054-4c90-b50b-d141bf7c548c","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.658335Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:a7b9b7a90d195a59663aa49c0458dd361d91f8dad9a70ccef4d8c8a511e2e3ce","observation_id":"f7916f18-88b2-4c1a-bc82-43740aec36d6","resolution":{"observed_at":"2026-08-12T15:03:26.526008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.397370Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"dea0acc6-887b-4b11-9947-195b40a4bf7e","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.684847Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:85e0807ec5b8dfe95816692a1885ef5d0be651182487d0b12e5f2892ccb5ad2f","observation_id":"e12fbe19-6997-4f7d-909e-b17297f5c9cf","resolution":{"observed_at":"2026-08-12T15:03:26.402925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.380039Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"7a3ed61c-0a39-4b39-b127-67387477e496","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.703238Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:21655bd20643d83e4a5782b300c5e3c7e5d6cbfbf91942bf476cce58dd4d60d3","observation_id":"20bebfd8-650d-49d4-ac7d-ae17e22fbe7f","resolution":{"observed_at":"2026-08-12T15:03:26.384883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.361068Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"6f0b0a51-dc2a-48ca-a753-3306a4b0b28f","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.722927Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:6a0630d05fc4a1d114e7d5996f01e5d8ed17a269a5d60a8dbb226b6ae68e85af","observation_id":"64bf1c8a-3c2f-4701-b9c2-65e916ba274a","resolution":{"observed_at":"2026-08-12T15:03:26.367041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.319360Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"9b8e02cd-910d-4c8d-a48e-3e5676637004","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.742266Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:db3cfeafbeaa98af3c83c83c12b51f462c3b8453b11e44819d37d5725c912f1d","observation_id":"f41e0017-36f1-4589-a6d3-7c23cf26867a","resolution":{"observed_at":"2026-08-12T15:03:26.347802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.146775Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"ffa7fd4c-b0e5-4163-9299-0b5ba16f537b","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.774916Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:ea15a73a18a8cd5b520e24bbbbb86fc848efe4543fc780e506581b8a8ea5a972","observation_id":"d627cf61-1a2a-44b5-b3d9-84ef68722d59","resolution":{"observed_at":"2026-08-12T15:03:26.201497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.124651Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"5b5ea299-0d00-496c-a97c-63bebee7a2ca","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.781282Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:fcbe4c4a5b8000b6673169721df8a90e6a86d5829b350686b28563657e15f494","observation_id":"908586c6-847a-490b-974e-25670ae78301","resolution":{"observed_at":"2026-08-12T15:03:26.130394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:26.054828Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"c3ffb7c9-0d12-4819-8546-cdda0b8aad35","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.788121Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:632371b0dfbf81db8822be15a014754b2db169e5c4a3dc281197730ce0514586","observation_id":"d8408868-447e-4c1e-9f17-52ab8c050c08","resolution":{"observed_at":"2026-08-12T15:03:26.104548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.918994Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"9db4827a-2562-4dfa-968c-961f1ef23fc9","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.793680Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:eb15b3980706d6aa3a20860fd9f4e392a5152978ea24d0c47b5bc4ee3d189a5c","observation_id":"359ef756-7ca3-479b-b8e2-0173901c1f08","resolution":{"observed_at":"2026-08-12T15:03:25.979567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.872632Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"749b2a76-1f67-4ae6-a3a6-76f825799de5","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.800239Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:012800982893686732813aa8473a3314564e5b1d885a32996cfad159a6fa3ced","observation_id":"9b67f61e-c732-45a4-8ca9-4e1c04f7cc21","resolution":{"observed_at":"2026-08-12T15:03:25.879257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.849354Z","title":"We will elaborate on it on the Appendix","venue":null,"work_id":"913a471d-c491-42df-93eb-c0cb526d650b","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.806116Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:f5700d192593dddb59aef04348a12d161992c3787ed32f73583cea3d33756f7f","observation_id":"203b5458-eb86-4803-895f-f06ba7791d03","resolution":{"observed_at":"2026-08-12T15:03:25.856187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.818183Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":"78a0ff5e-1062-4653-861c-78763040f6b3","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.812627Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:20f51e04829767d9749e7e4177597ec25a04c7a35d36d5b8ddfb7c2702b09845","observation_id":"a65abba1-5764-4268-b798-b0d52d976d09","resolution":{"observed_at":"2026-08-12T15:03:25.835417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.712072Z","title":null,"venue":null,"work_id":"01b6f1dc-257d-4826-9db4-4f4fb68d0d49","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.821604Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:3c50bd11a3e8c219373fa29398a4c58453be738762cb4c57814037860ba41dbd","observation_id":"f4685861-48c2-48e5-87dd-eb3e2c22db39","resolution":{"observed_at":"2026-08-12T15:03:25.780005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.660577Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"75c1e137-efdb-4050-8c8f-666badf0ecf0","year":null},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.829140Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:88b1ccbb0763ce32175573d4e9d05de5496b3e331190dbc467c11f5a299894f4","observation_id":"634334d2-a7d1-4e3d-9c9c-61e4764e8d8b","resolution":{"observed_at":"2026-08-12T15:03:25.665905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:25.641764Z","title":"Answer: [NA] Justification: We use LLM for paper writing","venue":null,"work_id":"df38fa9e-aa85-4e7b-9aa5-5c6ac52aa2fb","year":2025},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.836356Z"},"links":{"citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:a1f3cc63647387eeba6af824c6e07318e265314ed3c182d71c4b6054be5c7aee","observation_id":"b6332e21-180d-40d5-93e2-f7353a5f43ba","resolution":{"observed_at":"2026-08-12T15:03:25.647440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:56:17.571807Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2411.14725."}